社内LLMのGPU選定要件
ローカルLLMやRAGを社内に導入する際は、利用要件に応じたGPU選定が必要です。クラウドAPIと異なり、オンプレミスでLLMを動かす場合は「どのモデルを、どの規模で、何人が同時に使うのか」がそのままハードウェア要件に直結します。
業務AIの推論用途では、VRAM容量とメモリ帯域が主な選定指標になります。DigitalBaseのローカルLLM基盤構築における選定の考え方を、NVIDIA RTXシリーズを中心に整理します。スペックの読み方から、モデル規模別の推奨構成、量子化を前提とした実用ラインまでを扱います。
GPUスペックの読み方:AI推論の主な指標
GPUは「並列演算に特化したプロセッサ」です。CPUが少数のコアで逐次処理を行うのに対し、GPUは数千〜数万の演算コアで同時に処理します。AI推論の性能を左右する主な指標は以下のとおりです。
| 指標 | 意味 | AI推論での重要度 |
|---|---|---|
| VRAM容量(GB) | モデルと中間データを保持するメモリ容量 | ★★★★★ |
| メモリ帯域(GB/s) | データ転送速度。推論スループットに直結 | ★★★★☆ |
| CUDAコア数 | 並列演算ユニットの数 | ★★★☆☆ |
| TDP(消費電力) | 高負荷時の電力目安。冷却・電源設計に関係 | ★★★☆☆ |
LLM推論において最も重要なのは VRAM容量 です。モデル全体(量子化済みの重み)と推論時のKVキャッシュがVRAMに載りきらなければ、実用的な速度では動作しません。次に重要なのが メモリ帯域 です。LLMの推論は1トークン生成ごとにモデルパラメータをメモリから読み出すため、原理的にメモリ帯域律速になります。CUDAコア数は重要ですが、推論用途では上位2指標ほど支配的ではありません。
RTX世代の整理(2026年時点)
| 世代 | アーキテクチャ | 代表モデル | VRAM容量 | 主な用途 | 備考 |
|---|---|---|---|---|---|
| RTX 30xx | Ampere | 3060 / 3080 / 3090 | 8〜24GB | ゲーム・動画編集 | 旧世代だがコスパは依然高い |
| RTX 40xx | Ada Lovelace | 4060 / 4070 / 4090 | 8〜24GB | AI生成 / LLM / 4K編集 | 中古市場で入手性良好 |
| RTX 50xx | Blackwell | 5060 / 5070 / 5090 | 8〜32GB | AIローカル推論・運用 | GDDR7採用、電力効率改善 |
執筆時点では、RTX 50シリーズ(Blackwell世代)が現行主力となっています。GDDR7メモリの採用によりメモリ帯域が向上し、同一価格帯での推論スループットは前世代から着実に改善しています。
RTX 5060 Ti(16GB)は、業務用途のエントリー機として実用性の高い選択肢です。
- GDDR7メモリ搭載で、約448GB/sの帯域
- 消費電力は180W前後と、常時稼働させやすい
- 4bit量子化で8B〜20Bクラスのモデルまで実用ライン
一方、より大きなVRAMを必要とする場合は、RTX 5090(32GB)やデータセンター向けのA6000系、統合メモリを備えるNVIDIA GB10系が候補になります。
モデル規模別のGPU選定指針
LLM(テキスト生成)
LLMの推論では、量子化したモデルの重みとKVキャッシュがVRAMに収まることが前提条件です。社内アシスタントやRAGのバックエンドとして使う場合、VRAM 16GB以上を推奨します。
| モデル規模 | 量子化 | 推奨GPU | 備考 |
|---|---|---|---|
| 7B | 4bit | RTX 4060 / 5060 | 快適に動作 |
| 13B | 4bit | RTX 4070 / 5070 | 実用速度 |
| 20B | 4bit | RTX 4070 Ti / 5070 Ti | VRAMに余裕を持たせる |
| 34B〜70B | 4bit | RTX 4090 / 5090 / A6000以上 | 検証・小規模運用レベル |
7B〜13Bクラスであれば、RTX 4060 / 5060クラスでも十分に実用的な速度が得られます。20Bを超えるモデルを安定して扱うには、VRAM容量に余裕のある上位モデルが必要です。70Bクラスを単一GPUで動かす場合は、RTX 4090 / 5090(24〜32GB)でも量子化とオフロードの併用が前提となり、多人数の同時利用には向きません。
スペック値と設計上の目安
| 指標 | 目安 | 意味すること |
|---|---|---|
| CUDAコア数 | 4,000〜20,000 | 並列演算能力 |
| VRAM容量 | 8〜32GB | モデルの展開規模と入力長の上限 |
| メモリ帯域 | 300〜1,000GB/s | 推論スループットを左右する |
| TDP | 150〜450W | 電源・冷却に必要な設計余裕 |
| GPU長 | 260〜350mm | ケース選定時の物理制約 |
LLM推論の速度を検討する際は、VRAM不足によるオフロードと、メモリ帯域による律速を確認します。GPU選定の段階で、この2点を考慮する必要があります。
ローカルAIサーバの推奨構成例(2026年時点)
| 用途 | GPU | メモリ | 電源 | コメント |
|---|---|---|---|---|
| 軽量LLM・画像生成 | RTX 4060 / 5060 | 32GB | 650W | 小規模でも安定稼働 |
| RAG / ファインチューニング対応 | RTX 4070 Ti / 5070 Ti | 64GB | 850W | 13B〜20Bクラスを実用速度で |
| 研究・開発 / 34B〜70B検証 | RTX 4090 / 5090 | 128GB | 1,000W | 本格的なAI開発環境 |
GPU側のVRAMに加え、システムメモリも余裕を持たせることで、モデルの切り替えやデータ前処理が安定します。
モデル規模と同時利用人数に基づく選定
GPU選定の起点は、使用するモデルの規模と同時利用人数です。社内でLLMやRAGを運用する際は、量子化したモデルの重みとKVキャッシュを保持するVRAM容量、推論スループットを左右するメモリ帯域を確認し、利用要件に応じた構成を選びます。
